首页 > 教程攻略 > ai资讯 >今日开源(-06-14):哔哩哔哩Index-1.9B,2.8T中英文语料预训练

今日开源(-06-14):哔哩哔哩Index-1.9B,2.8T中英文语料预训练

来源:互联网 时间:2026-08-11 16:35:12

基座模型

① Index-1.9B

B站开源了一款轻量级模型Index-1.9B,参数规模19亿,在2.8T中英文为主的语料上完成了预训练。别看它个头不大,评测成绩跟同级别模型相比毫不逊色。这个系列涵盖基座模型、对照组模型、对话模型和角色扮演模型——其中角色扮演模型在SFT和DPO的基础上引入了RAG,实现了基于few-shot的角色定制,算是一条轻巧且实用的技术路线。

② table-transformer-detection

微软开源的基于Transformers的表格检测模型,专门针对文档中的表格提取做了微调。模型在PubTables1M数据集上训练,核心目标是从非结构化文档中完整提取表格信息。架构上沿用了DETR(Detection Transformer),并在自注意力和交叉注意力之前加上了LayerNorm,以此来提升性能。简单说,就是让模型更稳、更准地抓住表格结构。

③ Samba

微软另一款混合模型Samba,亮点是拥有无限的上下文长度。架构非常直白:Mamba + MLP + 滑动窗口注意力 + MLP层层堆叠。最大版本Samba-3.8B在Phi3数据集上训了3.2万亿个token,在MMLU、GSM8K和HumanEval等主流基准测试中大幅超越Phi3-mini。更关键的是,它通过极简的指令微调就能获得完美的长上下文检索能力,同时保持对序列长度的线性复杂度。这意味着Samba-3.8B-instruct在下游任务(比如长文本摘要)上表现相当出色。

必备工具

① Open WebUI

一个功能丰富、可扩展且用户友好的自托管Web界面,专门用来部署LLM,支持完全离线操作。它兼容Ollama和OpenAI兼容的API,安装方式也很友好——直接走Docker或Kubernetes,镜像支持ollama和cuda标签,可以无缝接上任何OpenAI兼容的API。对于想本地跑模型又想要个漂亮界面的团队来说,这个工具很实用。

② DiffusionKit

苹果芯片设备上玩扩散模型推理的工具包。它包括一个Python包,负责把PyTorch模型转成Core ML格式,并借助MLX在Python端直接做图像生成;还有一个Swift包,用于在设备上用Core ML和MLX进行推理。如果你手里有Mac或Apple Silicon设备,想跑扩散模型但不想折腾环境,DiffusionKit是个现成的好帮手。

robotic开发

① HumanPlus

斯坦福大学AILab开源的仿人机器人项目,目标是让机器人学会模仿人类动作——打拳、弹钢琴、打乒乓球、投掷、打字……听起来就很酷。项目包含两个核心组件:Humanoid Shadowing Transformer (HST) 和 Humanoid Imitation Transformer (HIT)。HST基于legged_gym和rsl_rl,在模拟环境中做强化学习;HIT则基于ACT和Mobile ALOHA仓库,在现实世界中做模仿学习。项目还提供了全身姿态估计以及相关硬件的代码库指导,对想做实机部署的团队来说,参考价值很大。