{"as_of":"2026-08-14T09:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c20bc41a32d9d29722cd6cdd5f0040fffed496e33a2f827cf018a162e8d47d3","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:13.982716Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T20:22:55.750693Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"cited_work":{"arxiv_id":"2505.19529","doi":"10.48550/arxiv.2505.19529","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19529","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"ef849c0c-7367-4339-b3d4-dbcd2e815f31","year":null},"citing_paper":{"arxiv_id":"2605.16991","last_updated":"2026-05-16T13:22:57Z","snapshot_observed_at":"2026-08-11T09:19:09.720144Z","submitted_at":"2026-05-16T13:22:57Z","title":"Response-free item difficulty modelling for multiple-choice items with fine-tuned transformers: Component-wise representation and multi-task learning","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-19T20:22:55.750693Z"},"links":{"cited_paper":"/paper/2505.19529","citing_paper":"/paper/2605.16991"},"observation_digest":"sha256:40a5cc36ebace056b822766c669b92bd289a656365ca80cd1fd76e52efff62bb","observation_id":"badbdbc5-1620-4e3c-a4d0-e4d8509464f9","resolution":{"observed_at":"2026-05-19T20:23:12.763744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19529/citation-record","integrity":"/paper/2505.19529/integrity","json":"/paper/2505.19529/citation-record.json","paper":"/paper/2505.19529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.739182Z","title":"Paligemma: Towards compact vision encoders for multi- modal models.Transactions on Image Processing,","venue":null,"work_id":"e0a67f73-81a9-4aa5-a43f-da588d38d809","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.400821Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:b8e9ca790544e2ce4798c4e9b68c2a297bb6dbb0d68fba6177dee94f4c12c550","observation_id":"ba269e43-3d07-482d-9e57-8d183c7e61d0","resolution":{"observed_at":"2026-08-07T14:17:17.827205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.543163Z","title":"In- ternvl2: Scalable multi-modal models with reduced vision encoder complexity","venue":null,"work_id":"2a5fc9fa-0b15-445f-a9e6-e7c8e45b362a","year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.455294Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:b3a261f21ea4ed42e3221baf7e63bf2a08b74fa5626ac82c9697497b9ab97196","observation_id":"e57543c6-54ef-47d4-a4bd-08ba2221afcd","resolution":{"observed_at":"2026-08-07T14:17:17.607727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-07T14:17:11.462045Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.arXiv preprint arXiv:2205.14135,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.462045Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:b7b60d17bb6ba32783cd5eec530bc078396a043ec9ec66c010dff415511283ae","observation_id":"525d393f-0f0e-47c6-b7b5-8a59b7d7bd7a","resolution":{"observed_at":"2026-08-07T14:17:11.462045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-13T20:00:04.634953Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T14:17:11.511088Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.511088Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:53a35638d4177e1059affa2b9b43402d29c9db5aaf22e797c374a8d11a669f07","observation_id":"32760e6c-4e9b-4439-b832-db51f67a6641","resolution":{"observed_at":"2026-08-07T14:17:11.511088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-07T14:17:11.537923Z","title":"Realtoxic- ityprompts: Evaluating neural toxic degeneration in lan- guage models.arXiv preprint arXiv:2009.11462,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.537923Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:c850ceea240644240e8df5dc3ff55c88083502843c8643c81c51ccc850f02d59","observation_id":"9e20b6e3-3618-43d1-9032-172cf5660d5e","resolution":{"observed_at":"2026-08-07T14:17:11.537923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.980669Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallu- cination and visual illusion in large vision-language models","venue":null,"work_id":"b9580f3a-bc47-4b87-bc8f-3824fe6f4f89","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.622080Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:39782ef42d45d274c6fa23b8b224f3db4ae4dbdc528a3b429200aad034ca1004","observation_id":"4d57117a-8ee2-4611-88a2-76b622201287","resolution":{"observed_at":"2026-08-07T14:17:17.071197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.750883Z","title":"Learning both weights and connections for efficient neural networks.Advances in Neural Infor- mation Processing Systems (NeurIPS), pages 1135–1143,","venue":null,"work_id":"755e26de-caa1-499c-b331-a670ac75241b","year":2015},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.624558Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:a7ac5a8047b94a3d146efcfb94db15d0734acdd14ea66315688b08cd59402829","observation_id":"fea74fcc-4562-4db2-aa15-11db796590ed","resolution":{"observed_at":"2026-08-07T14:17:16.844833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.599543Z","title":null,"venue":null,"work_id":"9639cb58-1737-4ec9-9234-620c53068667","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.682390Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:dd33df5d55736d3f2b13ef79f6e94200ae978d87d347a076d1a926d545ee6611","observation_id":"ff6090e1-6391-4622-93ba-414497b53be0","resolution":{"observed_at":"2026-08-07T14:17:16.646144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.448402Z","title":"Hooper and T","venue":null,"work_id":"f1ebbb34-5d1d-4e0c-949d-5bbae4078361","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.691663Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:7f4f6da49dab4433b611f7c5a540fca5ff30c1fd3e735943764f5faf171e77d8","observation_id":"f8778558-a2fb-4087-b379-4913e0515162","resolution":{"observed_at":"2026-08-07T14:17:16.517334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:11.707616Z","title":"The price of prompting: Profiling energy use in large language models inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.707616Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:aa07d31be0b60d44e3f8be4140fe0df6f1dd16162a88d16d041b10ccc1a96ae5","observation_id":"1d13cc24-f49a-4213-8240-4295edffd042","resolution":{"observed_at":"2026-08-07T14:17:11.707616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12345","last_updated":"2025-06-17T20:37:32Z","snapshot_observed_at":"2026-08-13T04:37:25.423033Z","submitted_at":"2024-01-22T20:20:48Z","title":"Distributionally Robust Receive Combining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12345","snapshot_observed_at":"2026-08-07T14:17:11.711326Z","title":"Mobilellm: Efficient adaptation of large language models for mobile devices.ArXiv Preprint, abs/2401.12345,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.711326Z"},"links":{"cited_paper":"/paper/2401.12345","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:f2eadf90b590f314dabf79cecb40c286f8e2bc66bf4b3eaf1e4fa3bd9a109f6a","observation_id":"bc43c28a-25c9-4381-8c83-bf0b92b7143b","resolution":{"observed_at":"2026-08-07T14:17:11.711326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-10T14:27:02.964369Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-07T14:17:11.727608Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.727608Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:eb2d802a6e74d4a605e58440354d9cf43d97b3ccdf60c6c10c0f873506a05532","observation_id":"b72f986e-e1fa-4137-948d-6f3944b454e4","resolution":{"observed_at":"2026-08-07T14:17:11.727608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:17:11.863978Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.863978Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:2dcee4a33d706deb70e1c6c1034c8efb063c7f537ce36c3e63f4d9c96b53a384","observation_id":"08c83d54-410e-45a5-b4c7-e695f2d79c0d","resolution":{"observed_at":"2026-08-07T14:17:11.863978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.122012Z","title":"Idefics2: Efficient multi-modal fusion with lightweight visual encoders.Transactions on Pattern Anal- ysis and Machine Intelligence,","venue":null,"work_id":"cfa4dbdb-b496-4794-bc65-a7d564ccdce7","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.055737Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5e4ecf01a51bb64f0e7bda7c78c1ffbf3dcd9a55bb0df8e0a4c6cb4f88f3a913","observation_id":"27f3e6c1-68fc-4035-9afd-f44d73be0d70","resolution":{"observed_at":"2026-08-07T14:17:16.234259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-07T14:17:12.163973Z","title":"The power of scale for parameter-efficient prompt tuning.arXiv preprint arXiv:2104.08691,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.163973Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:d7c9268a21c4612767bfe61757f9f12d87d30946bc62e082b45cda1b6a04d85e","observation_id":"3067529d-1b04-41d2-93d5-bf95167f3788","resolution":{"observed_at":"2026-08-07T14:17:12.163973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:17:12.320067Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.320067Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:eaa5521d8603fbe69d830b42218648de6036273b2f27a346a4ecccd2b89912d9","observation_id":"981ae193-7e67-442a-9c3b-1bf192d17e9e","resolution":{"observed_at":"2026-08-07T14:17:12.320067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12787","last_updated":"2024-09-06T04:30:50Z","snapshot_observed_at":"2026-08-12T22:58:55.508109Z","submitted_at":"2024-08-23T01:37:29Z","title":"LLM-PBE: Assessing Data Privacy in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12787","snapshot_observed_at":"2026-08-07T14:17:12.334623Z","title":"Llm-pbe: Assess- ing data privacy in large language models.arXiv preprint arXiv:2408.12787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.334623Z"},"links":{"cited_paper":"/paper/2408.12787","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:099010f5bb99f3842db39974720a01c9144a256969e140ee6c0c7ad6a44a11a6","observation_id":"f737957a-7371-4b8e-aa36-43a5b9c3ab8f","resolution":{"observed_at":"2026-08-07T14:17:12.334623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.797569Z","title":"Sophia: A memory-efficient optimizer for large-scale model training","venue":null,"work_id":"e158a2ca-ed63-41aa-92ef-7ff5dcf3c2ea","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.352967Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:16ae960063a0e9331f852c7f05b5bb33e4cfd0869e7eb57a2c4371239ea7f164","observation_id":"0a63797f-8042-4a1f-9fa6-f06e84a5dd47","resolution":{"observed_at":"2026-08-07T14:17:15.892780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05499","last_updated":"2025-12-29T02:25:27Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-08T18:43:11Z","title":"Prompt Injection attack against LLM-integrated Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05499","snapshot_observed_at":"2026-08-07T14:17:12.481222Z","title":"Prompt in- jection attack against llm-integrated applications.arXiv preprint arXiv:2306.05499,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.481222Z"},"links":{"cited_paper":"/paper/2306.05499","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:82d484e824f757a68215cc268c28493f450c21e6520932fcf762cb8572a54022","observation_id":"c58d0578-9101-470e-9eef-932886b97af9","resolution":{"observed_at":"2026-08-07T14:17:12.481222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03900","last_updated":"2024-06-29T14:07:20Z","snapshot_observed_at":"2026-08-13T04:02:02.531328Z","submitted_at":"2024-03-06T18:00:15Z","title":"Mamba4Rec: Towards Efficient Sequential Recommendation with Selective State Space Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03900","snapshot_observed_at":"2026-08-07T14:17:12.496846Z","title":"Mamba4rec: Towards efficient sequential recommendation with selective state space models.arXiv preprint arXiv:2403.03900,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.496846Z"},"links":{"cited_paper":"/paper/2403.03900","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5af65306629daf2f96410c2210277330edc44b816d42e417250c9fb4bb47c9cd","observation_id":"eb9bae79-ec57-4a33-8ce0-de74faecff51","resolution":{"observed_at":"2026-08-07T14:17:12.496846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T14:17:12.591921Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.591921Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:f0cf2e0c65fe26360c896a1b3872df9746a59a16578ee7dc2031b6d4b392590a","observation_id":"1d4ac386-14aa-4d58-aa36-a2e399a61ba2","resolution":{"observed_at":"2026-08-07T14:17:12.591921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.583534Z","title":"Mono-internvl: Mlp-based architectures for efficient multi-modal fusion","venue":null,"work_id":"09e20a21-32bc-431e-ab63-415ffd534a88","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.651520Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:0c68ab6a33e41ca4be26894b7a83e76634e761d0ce9c98194e7b50e21699be32","observation_id":"9d9c8a15-0f85-4924-8d95-e20f4bf3def6","resolution":{"observed_at":"2026-08-07T14:17:15.694658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.345101Z","title":"Mixed pre- cision training","venue":null,"work_id":"98f0902e-9d97-4ba0-a99e-894e40849bf0","year":2018},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.683775Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:83389463348e4db21c5397dde8a1f9d81a0336ecce774a5440cb5c42d8f9b5a1","observation_id":"1aafba37-afd3-47b5-9cbb-b195ed8b7c2c","resolution":{"observed_at":"2026-08-07T14:17:15.483641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.144832Z","title":"Characterizing power management opportunities for llms in the cloud","venue":null,"work_id":"fbe6da33-863e-4b7c-b8bb-2045ba687758","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.854614Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:b8f54ce8b5d7cef5528eaf02b5cbe9cdc3d3a0038598a0cb2f5a81cc9b0188ca","observation_id":"26686d04-756c-47ad-92a1-c9c358329c4a","resolution":{"observed_at":"2026-08-07T14:17:15.242828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T14:17:12.868317Z","title":"Rwkv: Reinventing rnns for the transformer era.arXiv preprint arXiv:2305.13048,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.868317Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:cd8a8c2ac2474810061a2220f1e7ae47f5e30ee3670154d900fec1af554a1624","observation_id":"7a85df90-f420-45fa-bcbc-c293d55f41b0","resolution":{"observed_at":"2026-08-07T14:17:12.868317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.981634Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"c71fd55d-124a-4539-883d-f9e21b919dfa","year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.929444Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:178fc8e3c5013b2a0895b84c61d0425fae0ecb0d8bb1f1349c4a14f08acc29c7","observation_id":"f7bc1586-190f-42cd-8d59-7db0f3401569","resolution":{"observed_at":"2026-08-07T14:17:15.051946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T14:17:13.000942Z","title":"Scaling language models: Methods, analysis & insights from training gopher.arXiv preprint arXiv:2112.11446,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.000942Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:8ef31f76f90b7d476b4843d2c66e4318fe03e6e080c5a888db0e59ee50004524","observation_id":"9c80f438-bf06-4bac-9da0-17b54e578f5c","resolution":{"observed_at":"2026-08-07T14:17:13.000942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.919439Z","title":"A primer in bertology: What we know about how bert works.Transactions of the Association for Com- putational Linguistics, 8:842–866,","venue":null,"work_id":"021a0e01-0a42-4f89-a8f5-045740443169","year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.036025Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:2637f765f1dbebd4fd945b023ba6cf1d53d96eb3d599e998f1f8446aca9a6bfc","observation_id":"8c0302bc-9844-495f-9d82-d0cd79918f66","resolution":{"observed_at":"2026-08-07T14:17:14.957140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T14:17:13.080609Z","title":"Distilbert, a distilled version of bert: Smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.080609Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:0916b9cd2023660f9c30bf5c9a47b917ba4521a267989f0ea49ab2f19c471a51","observation_id":"6bc4f6ac-cdfd-4a87-9005-923b38063684","resolution":{"observed_at":"2026-08-07T14:17:13.080609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20306","last_updated":"2024-03-29T17:22:48Z","snapshot_observed_at":"2026-08-13T00:41:53.584432Z","submitted_at":"2024-03-29T17:22:48Z","title":"Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20306","snapshot_observed_at":"2026-08-07T14:17:13.163081Z","title":"Towards greener llms: Bringing energy-efficiency to the forefront of llm inference.arXiv preprint arXiv:2403.20306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.163081Z"},"links":{"cited_paper":"/paper/2403.20306","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:453917d360143658a5a12caf442b97589ca9d0d10437e2c657002116a7a950e7","observation_id":"22d5c83e-5765-4de7-84be-7ec87f3ab893","resolution":{"observed_at":"2026-08-07T14:17:13.163081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:13.228754Z","title":"Dy- namollm: Designing llm inference clusters for performance and energy efficiency.arXiv preprint arXiv:2408.00741,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.228754Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:68b877a5ac02a8a8d203d6673936afcf99411efd853d5ad4411e1a5b78458fa9","observation_id":"ff0c436f-f0f8-4b17-8539-95eacae40950","resolution":{"observed_at":"2026-08-07T14:17:13.228754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.807548Z","title":"Mobilebert: A compact task-agnostic BERT for resource-limited devices","venue":null,"work_id":"be7026c6-a6ff-43aa-8bed-5a30584b8301","year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.316281Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:53a4beb510a2874cbb92e995045e79ae6ea907a0894793e03ab93a870cc619b3","observation_id":"d664f92c-b996-4566-82f9-81bf444e72d0","resolution":{"observed_at":"2026-08-07T14:17:14.858591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T14:17:13.388307Z","title":"[Sunet al., 2023 ] Mingjie Sun, Zhuang Liu, Anna Bair, and J Zico Kolter","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.388307Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:58aeba06df708d36e947a0e65487b100cb8c0ba22a244739eb6020b14e7d3fde","observation_id":"13675588-4f3d-41a6-9065-15e4421d2be0","resolution":{"observed_at":"2026-08-07T14:17:13.388307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02019","last_updated":"2023-10-24T17:58:42Z","snapshot_observed_at":"2026-08-13T10:40:59.072764Z","submitted_at":"2023-08-03T20:20:01Z","title":"Baby Llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02019","snapshot_observed_at":"2026-08-07T14:17:13.520349Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2308.02019,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.520349Z"},"links":{"cited_paper":"/paper/2308.02019","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:a782230c60175afdb5a6eac48ea948b394239f5bf8fb7c919c3a1ac102f50b2d","observation_id":"7e41aa38-ff46-4ba9-8ab9-2384f277e640","resolution":{"observed_at":"2026-08-07T14:17:13.520349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.639602Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"83206deb-d930-4642-aa51-e5172535b97b","year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.587314Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:bef0d41318f86809853574274143baa11455096a3a8020ee9816461e3435e009","observation_id":"d2d3d269-a9a6-4263-9a70-464058ce7405","resolution":{"observed_at":"2026-08-07T14:17:14.717813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T14:17:13.649125Z","title":"Wizardlm: Empowering large language models to follow complex instructions.arXiv preprint arXiv:2304.12244,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.649125Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:7821f7ac3be9ef63793c69f0463760136f34a80d759c3e6b5e292e2f7818d317","observation_id":"d9f20b2c-fff4-424d-9f38-361bf038c52f","resolution":{"observed_at":"2026-08-07T14:17:13.649125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13659","last_updated":"2024-07-02T11:57:07Z","snapshot_observed_at":"2026-08-13T04:13:52.097867Z","submitted_at":"2024-02-21T09:45:08Z","title":"Privacy-Preserving Instructions for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13659","snapshot_observed_at":"2026-08-07T14:17:13.709783Z","title":"Privacy-preserving instructions for aligning large language models.arXiv preprint arXiv:2402.13659,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.709783Z"},"links":{"cited_paper":"/paper/2402.13659","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:c77f44cbb02c73214a7e5c7fd744bdb743619fffe7a99a8596a9c3160b93e1b5","observation_id":"68daf60d-6e6b-400a-8df4-ab97fea72bc8","resolution":{"observed_at":"2026-08-07T14:17:13.709783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T14:17:13.776915Z","title":"Llama-adapter: Efficient fine- tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.776915Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:ef76e51554c2bb7a193d04131c8febf01c1e8dc03737261b2e07c31cd7454f82","observation_id":"6295d597-242a-4e73-80ea-d1236c263649","resolution":{"observed_at":"2026-08-07T14:17:13.776915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-07T14:17:13.851848Z","title":"Tinyllama: An open-source small language model.arXiv preprint arXiv:2401.02385,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.851848Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:8f55a80511959874f770a34322aaab320b9db8fdbc2b2c8d26edc5c22a1bf0a2","observation_id":"ebdda103-2ce5-433d-b1b2-a713d540c036","resolution":{"observed_at":"2026-08-07T14:17:13.851848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T14:17:13.922316Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.922316Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:e7e7e0e0f8adb07c3e2dc240ac2e34f11fc6b49c18253d78f4da8400cdbf876e","observation_id":"bd81e855-636f-4768-bbaf-40464cf7f24e","resolution":{"observed_at":"2026-08-07T14:17:13.922316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01323","last_updated":"2024-08-02T15:21:20Z","snapshot_observed_at":"2026-08-12T23:09:32.893523Z","submitted_at":"2024-08-02T15:21:20Z","title":"FANNO: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Only","version":1},"cited_work":{"arxiv_id":"2408.01323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01323","snapshot_observed_at":"2026-08-07T14:17:14.066843Z","title":"FANNO: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Only","venue":"cs.CL","work_id":"6d05b6d6-076f-4820-84ff-5582063e8256","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.982716Z"},"links":{"cited_paper":"/paper/2408.01323","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:c95c355b3a13e8bfbd1ae138fd18bf00f602bc9f82ec6631fb034678b2716afc","observation_id":"3149eb77-4ecc-456d-83e6-c3e6e4ed1d8d","resolution":{"observed_at":"2026-08-07T14:17:14.112359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-07T14:17:11.954986Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.954986Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:398b12fbfede4e29fabe3846dfe606fa7a0c42d76e6feefc77152e33ccebca94","observation_id":"451a2cec-ba0e-445a-b54e-ee7e56ad6f1e","resolution":{"observed_at":"2026-08-07T14:17:11.954986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04004","last_updated":"2024-02-09T01:56:38Z","snapshot_observed_at":"2026-08-13T07:29:53.467845Z","submitted_at":"2024-02-06T13:59:56Z","title":"Understanding the Effect of Noise in LLM Training Data with Algorithmic Chains of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04004","snapshot_observed_at":"2026-08-07T14:17:11.627462Z","title":"Under- standing the effect of noise in llm training data with algo- rithmic chains of thought.arXiv preprint arXiv:2402.04004,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.627462Z"},"links":{"cited_paper":"/paper/2402.04004","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:926a905518076dfc74ce8426a944d847b50cd032f504debc4257ef474973948a","observation_id":"18420bcd-1426-47cd-8f14-8638b35a56f6","resolution":{"observed_at":"2026-08-07T14:17:11.627462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-07T14:17:12.731119Z","title":"Bbq: A hand-built bias benchmark for question answering.arXiv preprint arXiv:2110.08193,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.731119Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:8cb8646b46ac30e3e0ea8bc659348abae6969d6569d87d66658f5b795e58fd7c","observation_id":"412d6c06-8663-4262-a70b-d2b1a3d26820","resolution":{"observed_at":"2026-08-07T14:17:12.731119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.315532Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"2fda59f1-19e3-435e-92e6-913a1ea0aaf1","year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.784482Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:083cb73d7f23b0adadba8dbe3d40ef2aae94dbf1766b661de03fdbdfef20ccd1","observation_id":"f13f7814-9cee-49a6-a712-46a252697270","resolution":{"observed_at":"2026-08-07T14:17:16.387650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.206657Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"feb6a0d3-590f-4896-a96b-39e33d218b4b","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.572309Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:3cf28366b7e98ba33fd860b88c43810388a0aa539fa703040f015432870b4674","observation_id":"e5707c30-1294-496b-81ba-f9e3009b34fe","resolution":{"observed_at":"2026-08-07T14:17:17.297578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.954176Z","title":"Mini-gemini: Efficient multi-modal models with lightweight vision en- coders.Proceedings of the International Conference on Machine Learning,","venue":null,"work_id":"ab95c304-43a1-43fd-bbf9-847fb8995e4d","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.255383Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:9e2076d22b22b5b71702510ae20b73920a9639123784f86c3ef26f29a882f20a","observation_id":"cc1cdb19-6f44-4ba1-8459-a4663bce7e02","resolution":{"observed_at":"2026-08-07T14:17:16.031243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T14:17:11.481150Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers.arXiv preprint arXiv:2210.17323,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.481150Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:e3a7451e7c484e1a266faaf229d138e899ebcdd4887374a063638eb9cba2b8ad","observation_id":"1b73d8c0-525e-4910-83c4-2e637df2c6c0","resolution":{"observed_at":"2026-08-07T14:17:11.481150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.392865Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"d06d818f-b8d6-4da9-a693-87dd9cb7118e","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.458535Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5a6820ec795c3f462a2bc6d089cbeb07d7b9aaa62e53efe10ab6e9536ae57f6e","observation_id":"409ed7a8-8a80-494a-bfd3-2994e99998b5","resolution":{"observed_at":"2026-08-07T14:17:17.457918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02376","last_updated":"2024-06-17T15:02:11Z","snapshot_observed_at":"2026-08-12T23:50:26.618385Z","submitted_at":"2024-06-04T14:53:24Z","title":"Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02376","snapshot_observed_at":"2026-08-07T14:17:11.452316Z","title":"Retaining key information under high compression ra- tios: Query-guided compressor for llms.arXiv preprint arXiv:2406.02376,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.452316Z"},"links":{"cited_paper":"/paper/2406.02376","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:dc4b7156cf813bdd74548c367a80a94faebdd7b7ba8fc8f714b8626992f38152","observation_id":"c0ab66cc-894b-4d69-b9e9-54185a6c8210","resolution":{"observed_at":"2026-08-07T14:17:11.452316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2505.19529."}